Skip to content

Feature-based reward learning shapes human social learning strategies

Schultner, Molleman, Lindström (2025)

DisciplineInterdisciplinary
MethodExperiment / simulation
Tagscultural evolutiondata · experimentlearning strategiesmethod · experimentmethod · machine learningmethod · simulationreinforcement learningreward learningsocial learning

Summary

Problem: 文化进化研究已识别出至少26种社会学习策略(如“复制多数”“复制成功者”),但主流理论将这些策略视为固定、领域特定的启发式规则,独立于个体经验。这一观点无法解释社会学习的灵活性、个体间巨大差异以及相互冲突策略如何被解决。奖励学习理论虽被提出,但缺乏正式模型和充分实证支持。 Approach: 作者提出了社会特征学习(SFL)模型,基于经典联想学习理论和现代强化学习,假设个体学习社会特征(如他人选择、他人收益)与非社会特征对自身奖励的预测价值,且同一学习机制同时作用于两类特征。通过六个激励性实验(n=1,941)验证模型核心假设,并通过模型比较、样本外泛化检验和基于主体的模拟展示该模型如何产生关键社会学习策略。 Finding: 实验表明,社会学习确实由个体奖励经验塑造:在一致条件下(社会特征与奖励对齐),参与者学会跟随多数或高收益选项;在不一致条件下(社会特征与奖励错位),参与者学会跟随少数或低收益选项。学习到的社会特征权重可泛化到新情境。模型比较显示SFL模型优于固定启发式模型和替代学习模型。模拟进一步证明SFL模型能在不同环境中自然产生“复制多数”“复制成功者”等关键社会学习策略。 Significance: 该研究将看似零散的社会学习策略统一为单一学习机制的行为表达,为文化进化研究提供了更简洁、更具解释力的机制性框架,解决了固定启发式观点在灵活性、个体差异和策略冲突方面的理论困境。

Theoretical Framework

  • Theoretical tradition: 该论文属于文化进化与社会学习研究传统,融合了联想学习理论、强化学习理论和计算建模方法。
  • Prior theories built upon: 论文明确建立在以下理论/模型之上:文化进化模型(Boyd & Richerson传统)、社会学习策略分类学(至少26种策略)、Rescorla–Wagner联想学习模型、现代强化学习理论(Q-learning)、特征竞争理论(associative learning theory中的feature competition)。
  • Causal mechanism: 个体通过奖励预测误差更新社会和非社会特征的权重(Rescorla–Wagner规则)。当某社会特征(如他人选择)与自身奖励正相关时,该特征获得正权重,促使个体在未来依赖该特征;负相关则获得负权重,促使个体回避该特征;无预测性则权重趋近于零。特征竞争机制使多个共同预测同一结果的特征的权重更新被稀释。
  • Key assumptions: (1)社会学习由个体奖励经验塑造;(2)同一学习机制同时作用于非社会和社会特征;(3)个体将情境感知为特征集合,学习特征的价值而非整体对象;(4)决策通过softmax函数基于特征加权值做出。
  • Theoretical move: 该论文挑战并整合了固定启发式观点,将奖励学习账户从口头推理提升为正式计算模型,扩展了联想学习理论的应用范围至社会学习领域,并综合了文化进化研究与强化学习两个传统。
  • Scope conditions: 模型在简单线性特征组合情境下形式化;实验采用简化的人工任务而非真实世界场景;模型适用于特征可识别、奖励信号明确的环境;作者指出真实世界特征表征可能更复杂、维度更高。

Research Design

本研究采用混合设计:六个在线激励性实验(行为实验)加基于主体的计算模拟。实验采用被试间设计,分为一致条件(congruent)和不一致条件(incongruent)。分析单元为个体参与者的选择行为。关键自变量为条件(一致/不一致)和社会特征类型(他人选择/他人收益/两者兼有);因变量为测试阶段首试选择跟随多数/少数或高/低收益选项的概率,以及社会影响程度(实验5)。实验1-4采用两阶段设计:学习阶段(参与者学习社会特征与奖励的关系)+测试阶段(新选项、等奖励概率,考察社会特征权重是否迁移)。实验5用社会影响估计任务替代测试阶段。实验6基于特征竞争设计诊断任务,检验同一机制是否作用于社会和非社会特征。

Data & Sample

  • 总样本量:n=1,941(六个实验合计)
  • 各实验样本:实验1 n=285;实验2 n=244;实验3 n=362;实验4 n=353;实验5 n=388;实验6 n=309
  • 人群:人类参与者(在线实验)
  • 招募方式:在线平台招募(具体平台未在文中明确说明)
  • 时间:论文2024年6月投稿,2025年6月接收,数据收集时间未明确说明
  • 数据来源:实验任务行为数据(选择记录、估计任务数据)

Analytical Strategy

  • 主要统计方法:逻辑回归(logistic regression)分析测试阶段首试选择,检验条件间差异及与0.5的比较;Wilcoxon符号秩检验(实验5社会影响差异);稳健回归(robust regression)检验个体社会特征权重与社会影响的关系
  • 计算建模:SFL模型拟合(基于Rescorla–Wagner更新规则),定量模型比较(SFL模型 vs 固定启发式模型 vs 替代学习模型),样本外泛化检验
  • 模拟分析:基于主体的代理模拟,变化环境参数(空间变异性、危险普遍性等)考察SFL模型产生的社会学习策略
  • 控制变量:模型包含权重先验参数(允许学习阶段首试的多数偏好)
  • 稳健性检验:补充信息中包含额外分析(Supplementary Information Section 2.3、2.4),跨参数范围模拟(Supplementary Fig. 2)

Results & Findings

发现1:社会学习由奖励经验塑造(实验1-5)

  • 实验1(他人选择):一致条件下92%参与者在测试首试跟随多数,不一致条件下仅30%跟随多数(即跟随少数)。条件间差异显著(β=−3.33, p<0.001)。
  • 实验2(他人收益):结果模式与实验1一致,一致条件下参与者跟随高收益选项,不一致条件下回避高收益选项(β=−3.98, p<0.001)。
  • 实验3(双社会特征):当两个社会特征(他人选择与他人收益)同时存在但仅一个与奖励相关时,参与者仅依赖奖励预测性特征。选择一致条件下偏好多数选项,收益一致条件下偏好高收益选项(β=1.54, p<0.001)。
  • 实验4(四选项复杂环境):一致条件下73%选择多数选项,不一致条件下仅14%选择多数选项(β=2.86, p<0.001);不一致条件下50%选择少数选项,一致条件下仅10%(β=2.26, p<0.001)。
  • 实验5(泛化到不同任务):一致条件下参与者社会影响中位数0.36,不一致条件0.27,差异显著(W=21,150, p=0.004)。个体SFL模型估计的社会特征权重预测了社会影响程度(β=0.2, p=0.007)。
  • 这些发现表明,社会学习策略并非固定启发式,而是随奖励经验动态调整,且学习到的特征权重可跨情境泛化。

发现2:同一学习机制作用于社会和非社会特征(实验6)

  • 基于特征竞争诊断任务,实验6检验了SFL模型的第二个核心假设。特征竞争是联想学习理论的标志性现象:共同预测同一结果的特征的学习会被削弱。结果显示该机制同时作用于社会和非社会特征,支持单一学习机制的假设。

发现3:SFL模型优于替代模型

  • 定量模型比较和样本外泛化检验表明,SFL模型比固定启发式模型和替代学习模型更好地解释社会学习行为。

发现4:模拟显示SFL模型产生关键社会学习策略

  • 基于主体的模拟表明,SFL模型在不同环境参数下(如空间变异性、危险普遍性)自然产生“复制多数”“复制成功者”等关键社会学习策略,与先前理论和实证发现一致。

零结果/意外发现:论文未明确报告零结果;实验3中非预测性社会特征未引导行为,符合模型预测。

Limitations

  • 实验采用简化的人工任务,目的不是模拟真实世界而是理论检验,生态效度有限
  • 模型形式化基于简单线性特征组合,真实世界特征表征可能更复杂、维度更高
  • 学习机制(社会与非社会特征是否同一)不可直接观察,实验6采用间接诊断任务推断
  • 论文未明确讨论样本代表性、文化差异或跨人群泛化问题
  • 模拟分析的环境参数范围有限,可能未覆盖所有现实环境类型

Key Contributions

  • 提出了社会特征学习(SFL)模型,将奖励学习账户从口头推理提升为正式计算模型
  • 通过六个实验(n=1,941)系统验证了SFL模型的两个核心假设:社会学习由经验塑造、同一机制作用于社会和非社会特征
  • 证明“复制多数”和“复制成功者”等关键社会学习策略可由单一学习机制统一解释,减少了策略分类学的理论冗余
  • 解决了固定启发式观点无法解释的三个问题:社会学习的灵活性、个体间差异、冲突策略的解决
  • 展示了学习到的社会特征权重可跨情境泛化(实验5),支持模型的推广能力
  • 通过模拟展示了SFL模型在不同环境中产生适应性社会学习策略,连接了个体学习机制与群体文化动态

Key Claims

"Here we advance a domain-general reward learning framework that provides a unifying mechanistic account of pivotal social learning strategies." (Abstract)

"Our findings suggest that people learn how to learn from others, enabling adaptive knowledge to spread dynamically throughout societies." (Abstract)

"Our account reduces the diverse taxonomy of seemingly distinct social learning strategies into behavioural expressions of one single underlying learning mechanism." (Introduction)

"The model rests on two key assumptions: (1) social learning is shaped by individual reward experience, and (2) the same learning mechanism operates on non-social and social features of the environment." (Results, Model overview)

"In essence, we demonstrate that many of the hitherto unconnected social learning strategies emerge naturally when individuals 'learn' to learn from others." (Introduction)


My Notes